Эволюция NLP: от фрагментированного ИИ к фундаментальным моделям
Определения
- Фрагментированный ИИ: эпоха, определяемая дискретными специализированными нейронными архитектурами, созданными для отдельных задач, таких как разметка последовательностей или классификация.
- Фундаментальная модель: единая монолитная архитектура трансформера, которая рассматривает все лингвистические задачи как генеративную последовательность текст-в-текст $x \rightarrow y$.
Основные концепции
- Архитектурная консолидация: Исторически NLP требовал специализированных конвейеров (Bi-LSTM для NER, CNN для анализа тональности). LLM разрушают эти «силосы», объединяя их в единый каркас, где одни и те же веса используются для каждой задачи.
- Единый интерфейс: LLM заменяют специализированные «выходные головы» (например, Softmax на 3 класса) интерфейсом на естественном языке. Входы и выходы всегда являются строками, что позволяет модели интерпретировать намерение а не формат.
- Перенос знаний: Традиционные модели были «чистым листом» для каждой задачи. LLM отдают приоритет обобщению прежде всего, где конкретные задачи — это лишь применение предсуществующего устойчивого внутреннего представления языка.
Исторический контекст
- До 2018 года: Изоляция задач требовала обучения отдельных моделей с различными функциями потерь $\mathcal{L}_{task}$.
- Современная эпоха: Парадигма «Текст-в-текст» позволяет одной модели (например, Llama-3) переключаться между задачами с помощью zero-shot или few-shot подсказок.
Сравнение реализации на Python
